R² 점수
R² 점수 (결정계수)
R² 점수(결정계수, Coefficient of Determination)는 회귀 모델의 성능을 측정하는 대표적인 지표입니다. 이는 모델이 종속 변수의 전체 분산 중 어느 정도의 비율을 설명하는지를 나타내며, 모델의 설명력을 정량적으로 평가하는 데 사용됩니다.
정의 및 수식
R² 점수는 실제 값과 모델 예측값 사이의 오차를 기반으로 계산됩니다. 수식은 다음과 같습니다.
$$R^2 = 1 - \frac{SS_{res}}{SS_{tot}}$$
각 용어의 정의는 다음과 같습니다. - $SS_{res}$ (잔차 제곱합, Residual Sum of Squares): 실제 값과 모델의 예측값 차이의 제곱합으로, 모델이 설명하지 못한 변동성을 의미합니다. - $SS_{tot}$ (총 제곱합, Total Sum of Squares): 실제 값과 실제 값의 평균 차이의 제곱합으로, 데이터가 가진 전체 변동성을 의미합니다.
결과 해석
R² 점수는 일반적으로 0에서 1 사이의 값을 가지며, 다음과 같이 해석합니다.
- 1에 가까울수록: 모델이 종속 변수의 변동성을 거의 완벽하게 설명하고 있으며, 예측 성능이 매우 높음을 의미합니다.
- 0에 가까울수록: 모델의 설명력이 낮으며, 단순히 종속 변수의 평균값으로 예측하는 것과 성능 차이가 없음을 의미합니다.
- 음수 값: 모델이 평균값으로 예측하는 것보다 더 낮은 성능을 보일 때 발생하며, 이는 모델이 데이터의 경향성을 전혀 반영하지 못하고 있음을 나타냅니다.
| R² 점수 범위 | 해석 | 모델 상태 |
|---|---|---|
| $R^2 \approx 1.0$ | 매우 높은 설명력 | 데이터의 패턴을 매우 잘 학습함 |
| $0.5 < R^2 < 0.8$ | 보통의 설명력 | 어느 정도의 경향성을 파악하고 있음 |
| $R^2 \approx 0$ | 낮은 설명력 | 모델이 유의미한 예측을 하지 못함 |
한계점 및 수정 결정계수
R² 점수는 유용한 지표이지만 치명적인 한계점이 있습니다. 모델에 독립 변수의 개수가 늘어날수록, 해당 변수가 실제로 종속 변수와 관련이 없더라도 R² 값은 수학적으로 무조건 증가하거나 유지되는 경향이 있습니다. 이는 모델의 복잡도 증가로 인한 과적합(Overfitting) 문제를 반영하지 못한다는 것을 의미합니다.
이러한 문제를 보완하기 위해 수정된 결정계수(Adjusted R²)를 사용합니다. 수정된 결정계수는 변수의 개수가 증가함에 따라 패널티를 부여하여, 실제로 모델의 성능 향상에 기여하는 변수가 추가되었을 때만 점수가 상승하도록 설계되었습니다.
이 문서는 AI 모델(gemma-4-31b)에 의해 생성된 콘텐츠입니다.
주의사항: AI가 생성한 내용은 부정확하거나 편향된 정보를 포함할 수 있습니다. 중요한 결정을 내리기 전에 반드시 신뢰할 수 있는 출처를 통해 정보를 확인하시기 바랍니다.